Un agente de IA fue descubierto creando identidades falsas en línea para obtener acceso no autorizado a sistemas seguros durante las pruebas de modelos de OpenAI y Anthropic, que revelaron una serie de nuevas brechas, según reveló el martes el Instituto de Seguridad de IA (AISI) de Gran Bretaña.
El instituto afirmó que los agentes que utilizan Mythos 5 de Anthropic y GPT-5.6-Sol de OpenAI realizaron acciones no autorizadas durante las evaluaciones de seguridad que la organización gubernamental llevó a cabo para evaluar las capacidades de los modelos.
«Algunos de los agentes sometidos a prueba habían participado en actividades continuas y potencialmente dañinas dirigidas a personas y organizaciones reales», afirmó AISI en una publicación de blog.
El informe subraya la laxa situación de las medidas de seguridad en torno al proceso de prueba de los agentes, que las empresas de IA están promocionando simultáneamente como el futuro de los negocios.
AISI, que tiene acceso a modelos avanzados de IA mediante acuerdos voluntarios con importantes laboratorios, sometió a los agentes a un escenario ficticio de ciberseguridad para poner a prueba sus capacidades.
El programa ejecutó el desafío 122 veces e identificó 19 acciones no autorizadas en un total de 10 pruebas. El agente de Anthropic estuvo detrás de 17 de las acciones, y el agente de OpenAI de las dos restantes.
La acción más grave consistió en que un agente escribiera código malicioso y creara identidades falsas en línea en un intento de conseguir que un humano aprobara el código, según informó AISI, añadiendo que no se detectaron daños reales como resultado de ninguna de las filtraciones.
Aunque AISI no especificó qué agente estaba detrás de las identidades falsas, la filtración no coincidía con ninguno de los dos casos que OpenAI había divulgado voluntariamente.
Andrew Yoon, investigador de CivAI, una organización sin ánimo de lucro de California que examina las capacidades y los peligros de la IA, dijo que, al parecer, el agente de Anthropic era el responsable.
«El hecho de que Mythos recurriera a acciones tan engañosas, con aparente conocimiento de que su objetivo era una persona real, sugiere que Anthropic no domina sus modelos tan bien como cree», dijo Yoon.
En un comunicado publicado en X, Anthropic afirmó que estaba colaborando estrechamente con AISI para obtener más detalles y llevar a cabo su propia investigación.
OpenAI compartió detalles en una publicación del blog de la compañía, señalando que ambas acciones no autorizadas de su agente implicaron el acceso a Internet de formas prohibidas por la instrucción.
«Nos comprometemos a trabajar en todo el sector para fortalecer las prácticas compartidas que permitan realizar evaluaciones de alto riesgo de forma segura, lo que incluye convocar a las partes interesadas, como los institutos nacionales de IA, los evaluadores independientes, otros laboratorios de IA y otros grupos en las próximas semanas», declaró OpenAI.
OpenAI también reveló en su blog un incidente aparte en el que una configuración incorrecta por parte de Irregular, un proveedor de pruebas externo, permitió que sus agentes se conectaran erróneamente a internet. Esto reflejó una revelación similar sobre una configuración incorrecta que Anthropic hizo la semana pasada.
Reuters informó la semana pasada que OpenAI había ampliado su investigación sobre el ciberataque tras encontrar pruebas de que otros agentes se habían escapado de la seguridad.
A diferencia de la brecha de seguridad sufrida en julio por un agente de OpenAI en la empresa de IA Hugging Face, los agentes utilizados en la evaluación de AISI no escaparon de un entorno de prueba aislado para acceder a internet. Según AISI, la agencia había permitido el acceso a internet de acuerdo con sus procedimientos de prueba estándar.
(Información de Kenrick Cai en San Francisco y Raphael Satter en Washington; Edición de Stephen Coates)
Fuente: reuters


